刚刚,GPT-6 Astra登顶了!
刚刚,GPT-6 Astra登顶了!OpenAI的GPT-6 Astra登顶MazeBench等多项AI基准测试,以14%的成绩拿下3D空间推理第一,并在视频设计零件、3D分子交互模拟、频谱图识别声音等实际任务中展现出逼近AGI的全面能力,获得英伟达CEO黄仁勋认证为全球首个拿下AGI的团队。
搜索
OpenAI的GPT-6 Astra登顶MazeBench等多项AI基准测试,以14%的成绩拿下3D空间推理第一,并在视频设计零件、3D分子交互模拟、频谱图识别声音等实际任务中展现出逼近AGI的全面能力,获得英伟达CEO黄仁勋认证为全球首个拿下AGI的团队。
OpenAI被曝正在内部测试GPT-6 Sol,单次速度约为GPT-6 Astra的6倍,同时公开内部数据称研究员每8小时工作日背后并行运行约3.1个Agent工作日、每日Agent推理资源花费超600美元,并宣布已实现"自动化AI研究实习生"目标;其首席科学家Jakub Pachocki同日发文警告AI对齐与监控难题,表示若必要OpenAI不排除单方面暂停扩大模型规模。
最近两天,相信大家都被 GPT-6 Astra 的各种逆天玩法刷屏了 —— 一句话完成 3D 建模、从零制作完整游戏、几千个零件的东西说拆就拆,甚至还能拿来控制机器人…… 总之,强得没边。
一只果蝇,在Minecraft里飞。
周末,GPT-6 Astra正式上线了。
OpenAI这次真狠,GPT-6用起来有一种2023年GPT-4的感觉。
OpenAI Codex团队成员Eric Provencher发文建议用户尽快清理项目中的Skill文件、AGENTS.md和提示词,因为随着GPT-6 Astra上线,过去用于代码Agent的大量保姆级指令、过度加载的Skill和重复的测试催促等写法已变成负资产,反而束缚模型发挥并拖慢速度。
媒体报道OpenAI发布GPT-6 Astra官博前后多次悄悄修改跑分数据,包括将自身幻觉率从4.2%降至2.0%、将竞品Anthropic Fable 5.1数学成绩调低近10个百分点,并将ARC-AGI-3得分从98.6%注水至99.99%,OpenAI仅以"消除噪点的常态修正"作为回应。
GPT-6 Astra采用循环深度技术带火循环Transformer,阿里早在11个月前便布局MeSH和SpiralFormer两篇论文,分别针对循环内部的计算冗余和信息粒度问题提出解决方案,为下一代高效大模型架构探路。
我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。